We propose a new method for estimating the minimizer $\boldsymbol{x}^*$ and the minimum value $f^*$ of a smooth and strongly convex regression function $f$ from the observations contaminated by random noise. Our estimator $\boldsymbol{z}_n$ of the minimizer $\boldsymbol{x}^*$ is based on a version of the projected gradient descent with the gradient estimated by a regularized local polynomial algorithm. Next, we propose a two-stage procedure for estimation of the minimum value $f^*$ of regression function $f$. At the first stage, we construct an accurate enough estimator of $\boldsymbol{x}^*$, which can be, for example, $\boldsymbol{z}_n$. At the second stage, we estimate the function value at the point obtained in the first stage using a rate optimal nonparametric procedure. We derive non-asymptotic upper bounds for the quadratic risk and optimization error of $\boldsymbol{z}_n$, and for the risk of estimating $f^*$. We establish minimax lower bounds showing that, under certain choice of parameters, the proposed algorithms achieve the minimax optimal rates of convergence on the class of smooth and strongly convex functions.
translated by 谷歌翻译
我们研究了线性上下文的匪徒问题,其中代理必须从池中选择一个候选者,每个候选者属于敏感组。在这种情况下,候选人的奖励可能无法直接可比,例如,当代理人是雇主雇用来自不同种族的候选人时,由于歧视性偏见和/或社会不公正,有些群体的奖励较低。我们提出了一个公平的概念,该概念指出,当代理人选择一个相对排名最高的候选人时,它是公平的,这可以衡量与同一组的候选人相比,奖励的良好程度。这是一个非常强烈的公平概念,因为代理没有直接观察到相对等级,而取决于基本的奖励模型和奖励的分布。因此,我们研究了学习政策的问题,该策略在背景之间是独立的,而每个小组之间的奖励分配是绝对连续的。特别是,我们设计了一个贪婪的策略,在每个回合中,从观察到的上下文奖励对构建了脊回归估计器,然后使用经验累积分布函数计算每个候选者的相对等级的估计值。我们证明,贪婪的策略在$ t $ rounds之后达到了日志因素,并且以高概率为止,订单$ \ sqrt {dt} $的合理伪regret,其中$ d $是上下文矢量的尺寸。 The policy also satisfies demographic parity at each round when averaged over all possible information available before the selection.我们最终通过概念模拟证明,我们的政策在实践中也可以实现次线性公平伪rebret。
translated by 谷歌翻译
这项工作研究了凸和Lipschitz功能的在线零级优化。我们基于两个函数评估和$ \ ell_1 $ -sphere的随机化提出了一个新颖的梯度估计器。考虑到可行的集合和Lipschitz假设的不同几何形状,我们分析了在线双重平均算法的算法,代替了通常的梯度。我们考虑对零级甲骨文噪声的两种假设:取消噪声和对抗性噪声。我们提供任何时间和完全数据驱动的算法,它适应问题的所有参数。在文献中先前研究过的噪声的情况下,我们的保证可以比Duchi等人获得的最新界限可比性或更好。 (2015)和Shamir(2017)非自适应算法。我们的分析是基于在$ \ ell_1 $ -sphere上带有显式常数的均匀度量的新加权的Poincar \'e类型不等式,这可能具有独立的利益。
translated by 谷歌翻译
A challenge in spoken language translation is that plenty of spoken content is long-form, but short units are necessary for obtaining high-quality translations. To address this mismatch, we fine-tune a general-purpose, large language model to split long ASR transcripts into segments that can be independently translated so as to maximize the overall translation quality. We compare to several segmentation strategies and find that our approach improves BLEU score on three languages by an average of 2.7 BLEU overall compared to an automatic punctuation baseline. Further, we demonstrate the effectiveness of two constrained decoding strategies to improve well-formedness of the model output from above 99% to 100%.
translated by 谷歌翻译
The field of natural language processing (NLP) has grown over the last few years: conferences have become larger, we have published an incredible amount of papers, and state-of-the-art research has been implemented in a large variety of customer-facing products. However, this paper argues that we have been less successful than we should have been and reflects on where and how the field fails to tap its full potential. Specifically, we demonstrate that, in recent years, subpar time allocation has been a major obstacle for NLP research. We outline multiple concrete problems together with their negative consequences and, importantly, suggest remedies to improve the status quo. We hope that this paper will be a starting point for discussions around which common practices are -- or are not -- beneficial for NLP research.
translated by 谷歌翻译
Industries must follow government rules and regulations around the world to classify products when assessing duties and taxes for international shipment. Harmonized System (HS) is the most standardized numerical method of classifying traded products among industry classification systems. A hierarchical ensemble model comprising of Bert- transformer, NER, distance-based approaches, and knowledge-graphs have been developed to address scalability, coverage, ability to capture nuances, automation and auditing requirements when classifying unknown text-descriptions as per HS method.
translated by 谷歌翻译
道路车辙是严重的道路障碍,可能导致早期和昂贵的维护成本的道路过早失败。在过去的几年中,正在积极进行使用图像处理技术和深度学习的道路损害检测研究。但是,这些研究主要集中在检测裂缝,坑洼及其变体上。很少有关于探测道路的研究。本文提出了一个新颖的道路车辙数据集,其中包括949张图像,并提供对象级别和像素级注释。部署了对象检测模型和语义分割模型,以检测所提出的数据集上的道路插道,并对模型预测进行了定量和定性分析,以评估模型性能并确定使用拟议方法检测道路插道时面临的挑战。对象检测模型Yolox-S实现了61.6%的Map@iou = 0.5,语义分割模型PSPNET(RESNET-50)达到54.69,精度为72.67,从而为将来的类似工作提供了基准的准确性。拟议的道路车辙数据集和我们的研究结果将有助于加速使用深度学习发现道路车辙的研究。
translated by 谷歌翻译
数据文章介绍了路线损坏数据集RDD2022,其中包括来自六个国家,日本,印度,捷克共和国,挪威,美国和中国的47,420条道路图像。图像已注释了超过55,000个道路损坏的实例。数据集中捕获了四种类型的道路损坏,即纵向裂缝,横向裂纹,鳄鱼裂纹和坑洼。设想注释的数据集用于开发基于深度学习的方法以自动检测和对道路损害进行分类。该数据集已作为基于人群传感的道路伤害检测挑战(CRDDC2022)的一部分发布。 CRDDC2022挑战邀请了来自全球的研究人员提出解决方案,以在多个国家 /地区自动道路损害检测。市政当局和道路机构可以使用RDD2022数据集,并使用RDD2022培训的模型用于低成本自动监测道路状况。此外,计算机视觉和机器学习研究人员可能会使用数据集对其他类型的其他基于图像的应用程序(分类,对象检测等)进行不同算法的性能。
translated by 谷歌翻译
压缩传感一直是依赖线性操作的非常成功的高维信号采集和恢复技术。但是,在存储或处理之前,必须对信号的实际测量进行量化。 1(一个) - 位压缩传感是压缩传感的大量量化版本,在其中,信号的每个线性测量都降低到一个位:测量的符号。一旦收集了足够的测量结果,1位压缩感应中的恢复问题旨在以尽可能准确的方式找到原始信号。恢复问题与学习理论中传统的“半空间学习”问题有关。为了恢复稀疏矢量,从1位测量值中的流行重建方法是二元迭代硬阈值(BIHT)算法。该算法是一种简单的投影次级下降法,尽管该问题的概念性不佳,但已知在经验上均能很好地收敛。 BIHT的收敛性属性在理论上没有合理的理由,除了大量的测量值(即,许多大于$ \ max \ {k^{10},24^{48},k^{3.5}/ k^{3.5}/ \ epsilon \} $,其中$ k $是稀疏性,$ \ epsilon $表示近似错误,甚至该表达式隐藏了其他因素)。在本文中,我们表明,BIHT算法仅通过$ \ tilde {o}收敛(\ frac {k} {\ epsilon})$测量。请注意,这种依赖性对$ k $和$ \ epsilon $对于1位压缩传感中的任何恢复方法都是最佳的。据我们所知,BIHT是唯一需要所有参数($ K $和$ \ epsilon $)中最佳测量值的实用和高效(多项式时间)算法。这也是在适当的结构条件下,梯度下降算法转化为非凸问题的正确解决方案的示例。
translated by 谷歌翻译
为了捕获许多社区检测问题的固有几何特征,我们建议使用一个新的社区随机图模型,我们称之为\ emph {几何块模型}。几何模型建立在\ emph {随机几何图}(Gilbert,1961)上,这是空间网络的随机图的基本模型之一,就像在ERD \ H上建立的良好的随机块模型一样{o} s-r \'{en} yi随机图。它也是受到社区发现中最新的理论和实际进步启发的随机社区模型的自然扩展。为了分析几何模型,我们首先为\ emph {Random Annulus图}提供新的连接结果,这是随机几何图的概括。自引入以来,已经研究了几何图的连通性特性,并且由于相关的边缘形成而很难分析它们。然后,我们使用随机环形图的连接结果来提供必要的条件,以有效地为几何块模型恢复社区。我们表明,一种简单的三角计数算法来检测几何模型中的社区几乎是最佳的。为此,我们考虑了两个图密度方案。在图表的平均程度随着顶点的对数增长的状态中,我们表明我们的算法在理论上和实际上都表现出色。相比之下,三角计数算法对于对数学度方案中随机块模型远非最佳。我们还查看了图表的平均度与顶点$ n $的数量线性增长的状态,因此要存储一个需要$ \ theta(n^2)$内存的图表。我们表明,我们的算法需要在此制度中仅存储$ o(n \ log n)$边缘以恢复潜在社区。
translated by 谷歌翻译